Improving Language Understanding by Generative Pre-Training (2018 论文)
概述
GPT 系列开山之作,提出使用生成式预训练学习通用语言表示,再微调下游任务的范式。
关键内容
- 预训练-微调范式:先在大规模无标注文本上进行生成式预训练,再在特定任务上微调,显著减少标注数据需求。
- Transformer 解码器:使用 Transformer 的解码器部分(带 因果掩码),自回归生成下一个 token。
- 与 BERT 对比:GPT 是单向语言模型,适合生成任务;BERT 是双向的,适合理解任务。两者互补。
来源
- ai_papers_timeline.md — 2018 年时间线条目
相关
- Alec Radford — authored_by
- GPT 系列 — introduced
- 预训练-微调范式 — introduced
- BERT — compares_to